MUSA SDK v4.3.3 发布版本信息
下载链接
发布说明
MUSA SDK v4.3.3 版本基于MUSA SDK 4.3.0分支进行功能迭代和问题修复,现已正式对内发布,具体支持平台以及对应项目见测试报告
测试平台
| 测试环境 | mtbios | CPU | OS | 内核版本 |
|---|---|---|---|---|
| Intel+Alinux host+Ubuntu Docker+S5000 | 4.3.27 | Intel(R) Xeon(R) Gold 6430 | Alibaba Cloud Linux 3 | 5.10.134-13.al8.x86_64 |
| AMD+ubuntu22.04+S5000 | 4.3.27 | AMD EPYC 9T34 64-Core | Ubuntu 22.04.4 LTS | 5.15.0-105-generic |
| Intel+Debian+S5000 | 4.3.27 | Intel(R) Xeon(R) Gold 6430 | Debian GNU/Linux 12 | 5.15.120-ve.3u1-amd64 |
| Hygon4+Ubuntu24.04+S5000 | 4.3.27 | Hygon C86-4G | Ubuntu 22.04.4 LTS | 5.15.0-105-generic |
| Hygon4+Kylin(试用版)+S5000 | 4.3.29 | Hygon C86-4G | Kylin Linux Advanced Server V10 (GFB) | 4.19.90-52.23.v2207.gfb08.ky10.x86_64 |
产品说明
摩尔线程 MUSA SDK 是一套完整的 GPU 并行计算开发环境,专为利用摩尔线程 GPU 加速程序而设计。通过 MUSA SDK,您能够轻松地利用 GPU 加速各种应用,涵盖企业数 据中心、桌面、工作站以及云平台和超级计算机等多个领域。该套件包括了 GPU 加速库、调试和优化工具、C/C++编译器以及用于应用程序部署的运行时库等功能。作为一套完整的开发工具,MUSA SDK 包含了以下主要组件:
- MUSA Toolkits,包含底层编译器、MUSA 运行时库、Musify 工具以及MUSA-X 基础数学计算加速库
- muDNN,MT GPU 深度学习加速库
- MCCL,MT GPU 通信加速库
- MUSA SDK 依赖于摩尔线程 GPU 和摩尔线程 GPU 通用驱动程序,需要运行在带有摩尔线程 GPU的服务器/工作站/PC 中,并安装了通用 Linux 驱动程序的环境中运行
- MT GPU:MTT S5000, MTT S4000,MTT S3000,MTT S80, MTT X300 等
- 通用驱动软件
另外 MUSA SDK 可配合摩尔线程提供的其他工具和软件提供更完整的 MUSA 计算功能
- GMI&MTML 工具,可提供显卡的管理监控功能并带有 C 函数接口
- 摩尔线程云原生套件,提供基于容器环境的 MUSA 计算并兼容 K8s 生态以及基于 RDMA 的GPU通信功能
功能描述
- 支持 SIMT(Single Instruction Multiple Thread,SIMT)架构并行编程模型
- 提供 MUSA 编程语言配套的编译器工具链 mcc,用于将 MUSA 应用程序源码编译为可以被 GPU识别的可执行文件
- MUSA 驱动与运行时库,提供完整的基于 MT GPU 的MUSA 运行环境
- 摩尔线程 MUSA 数学库提供了在 MT GPU 上优化过的数学函数库,包括
- 基础线性代数算子库 muBLAS(MUSA Basic Linear Algebra Subprograms)
- 快 速傅里叶变换库 muFFT(MUSA Fast Fourier Transform)
- 基础性能元库 muPP (MUSA Performance Primitives)
- 随机数生成库 muRAND
- MCCL 通信,针对摩尔线程 GPU 和网络进行性能优化的多 GPU 和多节点通信基元。 MCCL 提供了 all-gather、all-reduce、broadcast、reduce、reduce-scatter、point-to-point send 和 receive等原语,这些原语均经过优化,可通过节点内的 PCIe 和 MTLink 高速互联以及节点间的InfiniBand 网络实现高带宽和低延迟
- muDNN 库,针对深度学习领域和人工智能模型算法优化的函数库,提供高度优化的数学和数据处理任务的函数,包括张量运算,神经网络层计算,损失函数计算等
主要更新
功能更新(Feature Updates)
-
VPU 支持
- 新增对 VPU 的支持
- 使用 VPU 需将 mtbios 升级至 4.3.30 及以上版本
-
GPU 压测能力增强(muDNN benchmark)
- 支持通过
muDNNbenchmark进行 GPU 压测 - 新增环境变量控制执行超时时间:
export MUSA_EXECUTION_TIMEOUT=<按需定义,单位 ms>
- 支持通过
-
Hygon + Kylin V10 GFB 平台增强
- 支持在 Hygon + Kylin V10 GFB 平台上的运行
- 由于该 OS 不支持
dma_buff,需额外安装peermem组件以保证功能正常
-
Graph Capture & 多流支持
- 针对 SGLang / 蚂蚁场景的 graph capture multistream 能力进行增强,提升多流图捕获的稳定性与兼容性(修复相关 abort 问题)
-
中断管理能力优化
- 支持 PH1 平台 mt-link IRQ mask 重配置,提升中断管理与资源隔离能力
-
MCU 功能恢复与兼容性提升
- 在最新 DDK 与 mtbios 版本组合下,对 MCU 使用流程进行修正与兼容性增强,保障 MCU 可正常使用
-
内存传输链路优化
- 在 Master / release_musa_4.3.0 / PH1 场景下优化 memory transfer node 的执行路径
- 支持按场景合理选择 CE / shader 执行路径,提升传输效率与资源利用率
-
MuPTI 能力增强
- MuPTI 新增
muptiFinalize接口 - 支持对 Profiling/Tracing 生命周期进行显式收尾与资源释放,方便集成与自动化工具使用
- MuPTI 新增
-
Flash Attention 算法能力扩展
- 在 KUAE 场景中,Flash Attention 算子新增对 head dim = 256 训练场景的支持
- 扩展大模型场景下多头注意力的配置空间
-
算子与内核能力完善
- Permute Kernel
- 优化 permute kernel 在端到端场景下的计算正确性,保证与单测结果一致
- FA 算子精度
- 针对 FA(Flash Attention 相关)算子进行精度优化与修正,提升数值稳定性和收敛表现
- Permute Kernel
-
Graph / 通信相关能力增强
- MCCL Graph 场景稳定性
- 优化
mccl-test graph、mccl_cts API等场景下的 Graph 模式运行稳定性和错误处理机制,改善大规模分布式任务下的体验
- 优化
- MCCL Graph 场景稳定性
兼容环境
见测试报告
产品组件说明
MUSA SDK组件
| 包名称 | 版本 |
|---|---|
| mccl_rc2.1.3.PH1.tar.gz | 2.1.3 |
| mt-peermem_1.3_amd64.deb | 1.3 |
| mudnn_rc3.1.3.PH1.tar.gz | 3.1.3 |
| musa_3.3.3-server_amd64.deb | 3.3.3 |
| musa_toolkits_rc4.3.3.tar.gz | 4.3.3 |
| triton_rc1.4.3_py311.tar.gz | 1.4.3 |
| 79e98a02a_mtml_2.2.0-linux-R_amd64 | 2.2.0 |
| ComputeBenchmark.tar.gz | - |
| e17b1fb50_moore-perf-system_1.5.0_x86_64 | 1.5.0 |
| e17b1fb50_moore-perf-system_1.5.0_x86_64_internal | 1.5.0 |
| mt-datacenter-gpu-manager_amd64_v1.1.0_95e325db3 | 1.1.0 |

